独特融合算子：Softsign+Affine。一次内核完成仿射与 Softsign（u/(1+|u|)），适合在需要平滑饱和的场景中替代常见激活。

torchcode.py：参考实现 `y = (x*scale + bias) / (1 + |x*scale + bias|)`。
cudacode.py：`__global__ void softsign_affine_kernel(...)` 完成融合计算。
run_code.py：比较精度与性能（100 次迭代，`rtol=1e-03`）。
